00 - 专题索引
转载说明
本专题全文转载自开源文档站 AI Infra 学习笔记,作者 程治玮(Se7en / cr7258),仅作个人学习存档,正文与配图保持原样。
- 原文站点:https://se7en.mintlify.app/talks
- 源仓库:https://github.com/ai-infra-learning/docs (MIT License)
- 分享录屏:作者在 Bilibili 同步发布,各篇文内保留了原始播放器嵌入
这个专题讲什么
七期在线分享,沿着**「跑起来 → 看懂内存 → 看懂缓存 → 看懂解码 → 看懂调度 → 看懂架构 → 看懂平台」**的顺序,把 LLM 推理系统从单机部署一路拆到生产级推理平台。
| 期次 | 主题 | 解决的核心问题 | 关键概念 |
|---|---|---|---|
| 01 | vLLM 快速入门 | 怎么把 vLLM 跑起来 | 离线推理 vs 在线推理、GPU/CPU 后端 |
| 02 | PagedAttention | KV Cache 内存碎片 | 分页、Block Table、Copy-on-Write |
| 03 | Prefix Caching | 重复前缀的重复计算 | RadixAttention、Hash 复用、缓存感知路由 |
| 04 | Speculative Decoding | 自回归解码的串行瓶颈 | 草稿模型、Medusa、EAGLE、Lookahead |
| 05 | Chunked Prefill | Prefill 抢占 Decode | 分块预填充、Batching 演进 |
| 06 | PD 分离 | 两阶段互相干扰 | Goodput、KV Cache 传输、DistServe/Mooncake |
| 07 | 开源推理平台全景 | 集群级编排与调度 | Dynamo、llm-d、Kthena、OME、AiBrix、KServe |